GPU架构

大模型推理引擎 KV Cache 三级存储架构:从 GPU HBM 到 CPU DRAM 再到 NVMe SSD 的工程实践

深度剖析大推理引擎中 KV Cache 跨 GPU HBM、CPU DRAM、NVMe SSD 三级存储的调度架构与工程实现,涵盖 PagedAttention 的页表管理、CPU 换入换出策略、NVMe KV Cache 引擎设计、预取与淘汰算法,以及 2026 年最新方案对比(vLLM、SGLang、Mooncake、DistServe),附生产级性能基准与优化实践。

深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算

从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。

万亿参数大模型推理系统架构:从显存墙到多节点部署的实战工程

深入剖析万亿参数大模型推理的系统化工程架构,涵盖TP/PP/EP/DP四维并行策略组合、KV Cache三级存储/H2O淘汰策略、MXFP4/FP8量化协同、vLLM多节点部署实战(含docker-compose配置)、PD分离架构与Ray调度层调优、关键监控指标与自适应batch调度,以及HBM4-PIM/光学互连/联邦推理等前沿方向展望。